메뉴

#비전 AI

MP
MarkTechPost 10일 전
IMP 8

엔비디아, 13개 에이전트 기능 탑재한 딥스트림 9.1 출시

엔비디아가 코딩 에이전트가 자연어 프롬프트만으로 다중 카메라 비디오 분석 파이프라인을 구축할 수 있는 딥스트림 9.1을 출시했습니다. 이번 업데이트는 여러 카메라의 영상을 하나의 3D 공간에서 통합 추적하고, 번거로운 수동 카메라 보정 작업을 자동화하는 핵심 기능들을 도입하여 비전 AI 개발의 효율성을 크게 높입니다.

엔비디아 비전 AI 에이전트 AI
TD
The Decoder 45일 전
IMP 8

단일 텍스트 명령으로 모든 이미지 속 객체 수를 세는 AI 'Count Anything'

중국 칭화대 등 연구진이 메타(Meta)의 비전 모델(SAM3)을 기반으로 텍스트 프롬프트 하나만으로 위성 사진, 의료 스캔, 일상 사진 등 모든 이미지 내 객체의 수를 정확히 세고 표시하는 새로운 AI 모델 'Count Anything'을 발표했습니다. 이 시스템은 큰 객체는 박스로, 작고 밀집된 객체는 점으로 표시한 뒤 병합해 중복 계산을 방지하는 하이브리드 방식을 사용하여 기존 경쟁 모델들을 크게 압도하는 성능을 보여줍니다. 텍스트 기반 객체 카운팅을 위해 구축된 역대 최대 규모의 데이터셋을 학습한 이 모델은 의료, 농업, 도시 계획 등 다양한 실무 분야에서 활용도가 높을 것으로 기대됩니다.

객체 탐지 비전 AI 멀티모달